메뉴

#후 훈련

TD
The Decoder • 36일 전
IMP 6

AI 텍스트 탐지가 가능한 이유: 안전장치가 좁히는 표현 범위

AI 텍스트 탐지 업체 팡그램(Pangram)의 CTO 브래들리 에미는 LLM이 이론상 인간처럼 다양하게 쓸 수 있지만, 후 훈련(post-training)과 안전 가드레일이 표현 범위를 좁혀 '모드 붕괴(mode collapse)'를 유발해 텍스트가 탐지 가능해진다고 주장했습니다. 후 훈련 전 기반 모델이나 특정 작가·특정 커뮤니티에만 파인튜닝된 모델은 탐지되지 않지만, 워터마크가 삽입된 텍스트는 항상 탐지 가능하다는 점이 핵심입니다.

AI 텍스트 탐지 LLM 안전성